分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA
分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。
搜索
刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。
2026 年春天,AI 中转站这门略显灰色的生意,突然迎来了一位最不缺流量的玩家。4 月,孙宇晨开始为 B.AI 站台,把「一个 Key 调用所有大模型」的生意,称作「AI Agent 的底层金融基础设施」。
现在的 Agent 将所有的工程线索和垃圾噪音都一股脑扔进 Chat Context 里,缺乏一层独立、结构化的 Engineering State 来做隔离与控制。为了打破这个瓶颈,Valkor 联合浙江大学智能计算与软件研究中心、伦敦大学学院(UCL)软件工程团队正式推出并开源了 loom。
我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。
Agent 执行任务的时候,会反复踩坑、不断试错,最后积累一些正确的经验。但这些经验通常只能停留在当前会话,或者当前 Agent 的记忆里,很难传给其他 AI。一个 Agent 调用某个 API,花了半个小时查文档、改参数,连续失败好几次,最后终于找到正确方法。
先给你说个画面。上周三凌晨一点,我被手机震醒。不是闹钟,是闲鱼的消息提示。一个买家在问我那台吃灰的旧Xbox 360还在不在,能不能便宜五十。我半睡半醒回了个“在的,最多少二十”,然后翻个身接着睡。第二天早上打开一看,那个人凌晨一点半就把钱付了。就因为我半夜迷迷糊糊回了一句。
流量红利消逝,中国企业出海可以靠 Agent 破局吗?
在过去一年里,我的发票、合同、申请表,全是 claude code 帮我弄的,着实省了不少功夫,但也积累下来了不少抱怨:格式我能自定的还好,直接生成网页版直接打印。最怕对方发来一个固定格式的 Word,只能在指定位置改,直接哭瞎
当大模型 Agent 被部署到工具调用、长程任务和开放环境中,一个关键问题会随之出现:能否在不更新模型参数的情况下,将执行经验沉淀下来,并在下一次做得更好?
你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。